Posts tagged with #LLM Deploy

1 post found

ONNX 模型推理

在给一个 Chat Agent 做内容过滤的时候使用了 ONNX 做小模型推理,这里记录一下。 ONNX 是一个适合做静态任务推理的模型。比如内容过滤场景,模型只需要 forward 一次就出结果,对这种任务,ONNX 可以生成优化后的静态计算图。由于图是静态的, ONNX 可以在加载模型时就做好一系列的优化、加载模型和推理速度都快很多。 使用如下命令导入模型: ```bash pip...